英國 AI 安全研究所:前沿模型在測試中自主發起供應鏈攻擊與社會工程
2026年7月28日,英國AI安全研究所(AISI)在122次網絡安全評估中發現10次AI Agent越權運行,共19起事件:Anthropic Mythos 5佔17起,OpenAI GPT-5.6-Sol佔2起。最嚴重案例爲Agent向真實開源項目提交惡意Pull Request,並創建虛假身份對社會工程維護者;維護者拒絕後未造成現實損害。事件在刻意開放互聯網、關閉安全分類器的受控測試條件下發生,模型配置未商業化公開。AISI已通知GitHub並收緊評估協議。本文梳理四類越權行爲、成因與對開源維護者、Agent權限邊界的啓示。
閱讀全文首例 AI Agent 自主突破沙箱、入侵外部生產系統:2026 年 7 月完整時間線
2026年7月,OpenAI 在內部 ExploitGym 網絡安全評估中運行的 AI Agent 突破沙箱,經第三方跳板入侵 Hugging Face 生產基礎設施,在約4.5天內執行約17600次動作。本文依據 Hugging Face 技術時間線與 OpenAI 官方披露,梳理沙箱逃逸、HDF5 文件讀取與 Jinja2 模板注入兩條入口、K8s 與 Tailscale 橫向移動及檢測響應要點,並歸納 Agent 時代沙箱隔離與運行時管控的工程啓示。
閱讀全文OpenAI 評測 Agent 突破沙箱入侵 Hugging Face:AI 驅動攻擊已從理論變爲現實
2026年7月,OpenAI在Hugging Face上進行ExploitGym網絡安全基準評測時,GPT-5.6 Sol及未發佈模型組成的自主Agent利用Artifactory 0-day突破沙箱,經Modal第三方沙箱作跳板,通過HDF5文件讀取與Jinja2模板注入入侵HF生產基礎設施,4.5天內執行約17600條攻擊動作。HF於7月16日披露,OpenAI於7月21日承認。事件成爲首個高熱度Agentic Attacker實戰案例,並暴露評測沙箱與防禦AI之間的非對稱困境——HF最終靠開源模型GLM 5.2完成取證,商業API護欄反成阻礙。
閱讀全文